-
ViVa 论文精读:让视频生成模型成为机器人价值函数精读 ViVa:把 Wan2.2 的时空生成先验改造成价值模型,同时预测未来本体状态与任务回报,并接入 RECAP 改善长时程机器人强化学习。
14 min read -
VideoVLA 论文精读:让视频生成器同时想象与执行精读 VideoVLA:基于 CogVideoX-5B 的多模态 DiT 同时预测未来视频 latent 与 7D 动作,在 SIMPLER 和真实 Realman 上验证视频想象带来的泛化能力。
21 min read -
Genie Envisioner 论文精读:把世界模型、动作策略与模拟器合成一个闭环平台精读 Genie Envisioner:GE-Base 如何用多视角视频世界模型承载 GE-Act 动作解码、GE-Sim 闭环模拟与 EWMBench 评测。
26 min read